127 지도학습 이해
지도학습 이해는 정답 라벨이 있는 데이터로 분류와 회귀 모델을 설계하고, 성능 지표와 오류 분석을 통해 실제 예측 문제를 해결하는 과정이다.
0. 교육을 하는 이유와 궁극적인 목표
지도학습 교육의 궁극적인 목표는 학습자가 라벨 데이터의 품질을 점검하고, 분류·회귀 알고리즘을 문제에 맞게 선택하며, 모델의 오류 원인을 해석해 개선안을 제시할 수 있게 하는 것이다. 민간 데이터 사이언스 부트캠프의 예측 모델 프로젝트, scikit-learn 실습, XGBoost·LightGBM 기반 실무 모델링 흐름을 참고해 포트폴리오 수준의 예측 리포트를 완성한다.
참고한 유료형 교육 흐름
- 회귀·분류를 별도 프로젝트로 운영하고 평가 지표를 엄격히 구분하는 유료 ML 과정
- 트리 기반 모델과 선형 모델을 비교해 baseline부터 champion model까지 만드는 실무형 흐름
- imbalanced data, confusion matrix, ROC-AUC 등 오류 분석을 강조하는 전문 트랙
- 고객 이탈, 신용 위험, 가격 예측, 수요 예측 등 비즈니스 데이터 기반 프로젝트 방식
입문 · 1일
입문 지도학습 교육과정
라벨 데이터와 예측 목표의 의미를 이해한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 라벨과 입력 변수를 구분한다. | 타이타닉 생존 예측 데이터에서 target, feature, 불필요한 식별자를 색상으로 표시한다. 분류 문제와 회귀 문제를 예측값 형태에 따라 카드 정렬 활동으로 구분한다. |
| 목표 2 | 기준 모델을 만든다. | DummyClassifier와 평균값 예측 회귀모델을 실행해 최소 기준 성능을 확인한다. 기준 모델보다 좋은 모델이 왜 필요한지 오류 사례를 숫자로 비교한다. |
| 목표 3 | 기본 성능을 평가한다. | 분류에서는 accuracy와 confusion matrix를 출력하고, 회귀에서는 MAE와 RMSE를 계산한다. 잘못 예측한 샘플을 직접 찾아 데이터 품질 문제와 모델 한계를 구분한다. |
| 사용 플랫폼 | Python, Google Colab, pandas, scikit-learn, Matplotlib |
|---|---|
| 강사 스펙 | 분류·회귀 개념, 기초 평가 지표, Colab 실습 지도 경험 3년 이상 |
| 수업대상 | ML 입문자, 청소년 데이터반, 비전공 성인 학습자 |
| 소요시간 | 4-6시간 |
| 준비물 | 노트북, Colab 계정, 라벨 데이터셋, 지표 계산 활동지 |
| 산출물 | 라벨 구조 분석표, 기준 모델, 기본 평가표 |
| 평가방법 | 라벨이해 25%, 기준모델 25%, 지표해석 30%, 오류분석 10%, 참여도 10% |
초급 · 3일
초급 지도학습 교육과정
분류와 회귀 알고리즘을 비교하고 지표 중심으로 선택한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 분류 모델을 비교한다. | Logistic Regression, KNN, Decision Tree, RandomForest를 같은 데이터에서 학습시킨다. precision과 recall의 trade-off를 스팸 탐지·질병 의심 사례로 비교한다. |
| 목표 2 | 회귀 모델을 비교한다. | Linear Regression, Ridge, RandomForestRegressor를 주택 가격 또는 매출 예측 데이터에 적용한다. 잔차 그래프와 예측값-실제값 산점도를 확인해 오차 패턴을 해석한다. |
| 목표 3 | 데이터 불균형을 처리한다. | class_weight, stratified split, threshold 조정을 적용해 소수 클래스 탐지 성능을 개선한다. 불균형 데이터에서 accuracy만 사용하는 위험을 보고서 문장으로 정리한다. |
| 사용 플랫폼 | Python, scikit-learn, pandas, Matplotlib, imbalanced-learn |
|---|---|
| 강사 스펙 | 지도학습 알고리즘 비교, 불균형 데이터 처리, 지표 기반 피드백 경험 3년 이상 |
| 수업대상 | 기초 ML 수료자, 데이터 분석 입문자, 취업 준비생 |
| 소요시간 | 12-18시간 |
| 준비물 | 노트북, 분류·회귀 데이터셋, 지표 해석표, 오류 사례지 |
| 산출물 | 분류 모델 비교표, 회귀 모델 비교표, 불균형 처리 실습 노트북 |
| 평가방법 | 모델비교 30%, 지표선택 25%, 불균형처리 20%, 해석리포트 15%, 참여도 10% |
초급 · 1주
초급 1주 지도학습 교육과정
실제 예측 문제를 end-to-end 프로젝트로 완성한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 예측 프로젝트를 설계한다. | 고객 이탈, 시험 합격, 매출, 대여 수요 중 하나를 골라 target leakage 가능성을 점검한다. 평가 지표와 업무 성공 기준을 연결해 모델 목표 문장을 작성한다. |
| 목표 2 | 특성 선택과 튜닝을 수행한다. | permutation importance와 feature importance를 비교해 핵심 변수를 선정한다. RandomizedSearchCV로 모델 파라미터를 조정하고 기준 모델 대비 개선률을 계산한다. |
| 목표 3 | 비즈니스 해석을 제시한다. | SHAP 또는 partial dependence plot으로 주요 변수의 영향을 시각화한다. 모델 결과를 바탕으로 실제 행동 제안 3개와 주의사항 3개를 작성한다. |
| 사용 플랫폼 | Python, scikit-learn, XGBoost, SHAP, Jupyter Notebook, GitHub |
|---|---|
| 강사 스펙 | 지도학습 프로젝트 설계, 모델 해석, 포트폴리오 리뷰 경험 4년 이상 |
| 수업대상 | 데이터 프로젝트반, 직업훈련생, 대학생, 사내 분석가 |
| 소요시간 | 20-30시간 |
| 준비물 | 노트북, GitHub 계정, 프로젝트 데이터셋, SHAP 예제, 발표 템플릿 |
| 산출물 | 예측 프로젝트 노트북, 변수 중요도 분석, 비즈니스 해석 리포트 |
| 평가방법 | 프로젝트설계 20%, 튜닝 25%, 해석 25%, 리포트 20%, 발표 10% |
중급 · 4주
중급 지도학습 교육과정
고성능 예측 모델과 검증 전략을 구성한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 검증 전략을 고도화한다. | time series split, group split, stratified k-fold를 데이터 구조에 맞게 선택한다. 검증 방식이 잘못되었을 때 발생하는 성능 과대평가 사례를 재현한다. |
| 목표 2 | 앙상블 모델을 최적화한다. | XGBoost, LightGBM, CatBoost를 비교하고 categorical feature 처리 차이를 확인한다. early stopping과 learning rate 조정으로 과적합을 줄인다. |
| 목표 3 | 모델 모니터링 계획을 세운다. | 데이터 드리프트, 성능 드리프트, threshold 재조정 기준을 표로 만든다. 예측 결과 저장 구조와 주기적 재학습 조건을 설계한다. |
| 사용 플랫폼 | Python, XGBoost, LightGBM, CatBoost, scikit-learn, MLflow |
|---|---|
| 강사 스펙 | 앙상블 모델링, 검증 전략, 모델 모니터링 설계 경험 4년 이상 |
| 수업대상 | 중급 데이터 분석가, ML 엔지니어 입문자, 사내 AI 담당자 |
| 소요시간 | 40-60시간 |
| 준비물 | 노트북, 고급 실습 데이터셋, MLflow 환경, 모니터링 체크리스트 |
| 산출물 | 검증전략 문서, 앙상블 모델, 모니터링 설계서 |
| 평가방법 | 검증전략 30%, 앙상블성능 25%, 드리프트설계 20%, 문서화 15%, 발표 10% |
심화 · 8주
심화 지도학습 교육과정
지도학습 모델을 교육·운영 가능한 실무 패키지로 완성한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 산업별 지도학습 사례를 구축한다. | 금융 리스크, 의료 스크리닝, 교육 성취, 제조 불량, 마케팅 전환 사례별 데이터 구조를 분석한다. 산업별 라벨 오류와 윤리 위험을 사례은행으로 정리한다. |
| 목표 2 | 강사용 평가 루브릭을 만든다. | 데이터 분할, 지표 선택, leakage 점검, 모델 해석, 실행 재현성을 평가항목으로 설계한다. 학습자 노트북을 자동 점검할 수 있는 체크셀과 제출 규칙을 만든다. |
| 목표 3 | 운영형 예측 시스템 제안서를 완성한다. | 모델 입력, 예측 결과, 사용자 화면, 재학습 주기, 책임자를 포함한 운영안을 작성한다. 최종 발표에서 성능 한계, 편향 가능성, 현장 적용 조건을 명확히 설명한다. |
| 사용 플랫폼 | Python, scikit-learn, XGBoost, SHAP, MLflow, FastAPI, GitHub Actions |
|---|---|
| 강사 스펙 | 지도학습 강사양성, 산업별 모델링, 윤리·운영 검수 경험 5년 이상 |
| 수업대상 | AI 강사, 데이터 컨설턴트, 기업 교육 담당자, 분석 리더 |
| 소요시간 | 80-120시간 |
| 준비물 | 강사용 PC, 산업별 데이터셋, 루브릭 템플릿, 운영 제안서 양식 |
| 산출물 | 산업별 사례은행, 자동 점검 루브릭, 운영형 예측 시스템 제안서 |
| 평가방법 | 사례구축 25%, 루브릭 25%, 운영제안 25%, 윤리검수 15%, 발표 10% |